ai signal
AI 업데이트: LLM 평가의 신뢰성이 흔들린다
🤖 0 in / 0 out / 0 total tokens
오늘 논문 세 개가 전부 "우리가 믿어온 측정 방법이 맞나"라는 질문을 던진다. 편향 탐지, 벤치마크 신뢰성, 학습 전략까지 — 다 같은 얘기다. 뭘 근거로 판단할 건지에 대한 문제다.
📄 논문
Reference-Based Bias Detection in LLMs via Relative
이더3시간 전4 min read0LLM 평가벤치마크 신뢰성액티브 러닝